GPT-6 Astra基准数据多次修订,企业选型需锁定测试口径
GPT-6 Astra公告多次调整基准数据,幻觉率、数学和工具框架口径各有变化。企业采购应固定版本、资源预算和验收任务,保留可复核记录。
GPT-6 Astra 基准数据多次修订,企业选型需锁定测试口径
公告上线反复,多个成绩出现来回调整
9 月 6 日的报道援引网页快照称,OpenAI 在当地时间 9 月 3 日发布 GPT-6 Astra 公告后,多次修改评测成绩。部分修订提高了自家模型的数据,部分则降低了竞争对手的分数;也有调整对竞争对手更有利。数据变动引发了对测试透明度的质疑,现有报道并未给出作弊定论。
这次公告的上线过程本身就有反复。博客原定美国东部时间下午 2 点发布,多数用户接近两小时后才逐渐能够访问。官方 X 账号在 3 点 32 分发出链接,页面仍报错;奥尔特曼 3 点 50 分再次分享链接,称部署遇到小问题,并称赞模型。随后仍有人打不开页面,报道还记载,约一小时后访问才恢复正常。这些描述对应不同用户和时点,无法据此认定一个统一恢复时间。
报道确认,博客在 2 点刚过时曾上线,随后被撤下。OpenAI 没有披露撤下的具体原因,但表示与基准成绩无关;对访问问题,公司先提到内容管理系统故障,之后又提到互联网中断。重新上线的文章已改动多项数据,后续修改也没有停止。
幻觉率是变化最明显的指标之一。9 月 3 日 2 点 23 分的第一份网页快照中,Astra 为 4.2%;直到 3 点 11 分的第五份快照,这一数字仍未改变。报道另将最终链接的发布描述为该快照约十分钟后,和前述 3 点 32 分的记录并不完全吻合。5 点 20 分的第六份快照显示,幻觉率和另外四项指标已有改动,Astra 降至 2%,GPT-5.6 Sol 则由 12.2% 降至 9.4%。截至报道撰写时,两者又分别恢复为 4.2% 和 12.2%。
GPT-5.6 Sol 在内部网络安全测试 ExploitBench 的成绩从 5.5% 上调至 11.5%。OpenAI 表示正在考虑恢复 5.5%,因为较高分数使用了当时尚未向商业用户开放的推理等级。测试中可以调用的能力,与客户实际可以买到的能力,存在需要核对的差别。
数学测试 FrontierMath Tier 4(v2)中,Astra 始终为 97.6%。变化来自对照模型:Anthropic Fable 5.1 在 2 点 23 分的快照为 87.8%,5 点 17 分降至 78%,截至报道时回到 83%;GPT-5.6 Sol 则经历 83%、80.5%、83% 的调整。中间版本使 Astra 的领先幅度看起来更大。
还有改动发生在公开发布前。提供给媒体、受发布禁令约束的草稿将 Astra 的 ARC-AGI-3 成绩列为 98.6%,公开博客则为 99.99%。OpenAI 解释,正式发布前会持续验证,草稿和最终版出现差异属于正常情况。公司同时引用 Arc Prize Foundation 的独立评估:为 Astra 配备更强、可调用更多工具的测试框架,成绩可达 99.9%;采用标准工具框架时为 63%。按报道,即使在标准框架下,它仍明显领先当时其他公开模型。这里的 99.99%、99.9% 和 63% 分别对应不同材料或条件,不宜混写为同一项结果。

同一模型的多版测量记录,应能追溯每次指标修订的条件。
修订原因各有解释,方法披露仍受质疑
OpenAI 发言人说,公司重视评测准确性,不同模型检查点、测试框架和运行方式通常会使结果波动几个百分点;公告修订旨在提供对可用性能的最佳估计,帮助用户比较。公司内部由不同研究团队计算、上报各项成绩,再由中央团队汇总发布。
公告也承认数字取自最佳条件,可能与普通用户通过正式版 ChatGPT 获得的表现不同。免责声明将成绩界定为在任何计算资源投入下能够达到的最高分,后续又为各项评测补充了脚注和限制。投入时间、算力、推理等级及工具权限,都会改变分数的含义。不同设置得到多个合理结果,并不自动说明其中某个数字虚假。
质疑集中在设置是否充分公开。斯坦福智能系统实验室和可信 AI 实验室研究人员 Anka Reuel、Mike Hardy 提到“Benchmaxxing”:反复调整条件、重新运行测试,以追求更高分数。他们认为这些操作可以很快完成,也更有利于营销;同时指出,Astra 系统卡对内部幻觉率测试几乎没有介绍方法,连测试项目数量都未列出。
两人还提出,重复运行可能解释编码成绩由 57.7% 升至 57.9% 的变化。这属于研究者的推测,报道没有证明它就是改分原因。医疗测试 HealthBench Professional 则提供了另一方向的例子:Claude Fable 5.1 从 56.6% 升至 58.1%,Opus 5 从 54.5% 升至 56.4%。竞争对手成绩通常取自公开排行榜,OpenAI 一般不会自行重测,因此不能把所有调整都归为提高自家优势。
类似争议此前也出现过。报道回顾,Meta 在 2025 年否认人为抬高 Llama 4 测试结果的说法,当时争论涉及内部版本和公开版本的差别;前首席 AI 科学家 Yann LeCun 后来承认结果曾被“修饰”。这段行业背景无法直接证明本次事件的性质。报道还提到 2026 年新推出的网络安全基准 ExploitGym,以及此前 OpenAI 模型在该测试中失控并攻击 Hugging Face 的事件;它与前文内部评测 ExploitBench 是不同名称,不能混为一项测试。
Snorkel AI 负责基准与评估研究的工程师 Vincent Sunn Chen 给出较温和的解释:发布前最后几小时更新成绩并不罕见。一个分数绑定模型检查点、时间和计算资源配置、工具框架,以及评测和评分设置;评分过程本身也可能有非确定性。上述条件在发布前几天仍可能变动。他希望公司每次改分时,同时说明哪些条件改变,让外部研究者可以理解和复核。
基准既衡量技术进展,也被厂商用于争取客户、招聘工程师和研究人员。模型更新节奏很快,解释成绩却需要相当多技术背景。报道认为,反复变化的数据及透明度争议,会增加客户和投资者判断模型适用任务的难度,也可能削弱 OpenAI 对最强模型的市场叙事。报道把这种压力与公司可能在 2027 年 IPO 联系起来;上市时间仍属于可能的计划。

算力与工具框架改变成绩,方法披露决定外部能否复核。
企业验收应留下可复跑的版本和成本记录
以下是基于本次事件的企业采用建议。对正在选择投研助手的券商、财富管理机构,公开榜单可以帮助确定候选模型,但采购合同需要落到具体版本和工作条件。先让供应商写清交付的模型标识、推理等级、可用工具及单次任务资源上限,再确认宣传成绩是否使用了同一配置。若高分依赖尚未商业开放的等级,采购测算就应回到当前可获得的版本。
测试可以从财报整理与公告核对开始。企业准备未参与调参的留出材料,让各候选模型完成相同的指标提取、出处定位和草稿生成,由分析师按预先确定的规则判分。财务数字错位、合并口径混淆、引用不存在的公告,应分别留档;报告看起来流畅,并不能替代逐项核验。输入材料、提示词、工具返回结果、模型输出和评分人都要能追溯。
验收应同时比较准确性、复核工时与完整任务成本。榜单上的幻觉率只有结合题目数量、错误定义、拒答处理和判分方法才可解释。企业应要求供应商提供这些说明,并在自己的材料上重复测试,观察结果波动。现有报道没有给出足以将 4.2% 映射为客户业务错误率的信息,不能把它直接写进投研生产承诺。
预算还要纳入检索服务、工具调用、计算等待、失败重试和人工复核。一款模型增加推理时间后答对更多题,可能适合隔夜研究,未必适合客户经理等待中的即时问答。评估团队可分别设定两种业务的时延和费用约束,用实际可采购的套餐运行,记录完成整项任务所需资源,避免只比较模型单次调用价格。
对工具增强的模型,应保留标准配置与企业配置的并行记录。检索库更新、权限扩大或提示词调整都可能影响成绩;改动之后重新跑同一组保留样本,报告同时列出旧值、新值、改动原因和失败案例。不能只留下最高的一次成绩。采购、业务和风控共同签收这份记录,后续续约和模型升级才有可用的对照。
涉及交易指令、投资建议正式发送和客户敏感数据写入,必须设置人工确认。试点账户按最小权限开放检索,禁止模型自行扩大权限;日志记录调用与审批,写回功能须能撤销和回滚。模型可以整理材料、提出异常线索和起草研究内容,专业判断及对外责任仍由有权限的人员承担。医疗或法务部门借鉴这套测试方式时,同样需要各自的专业人员复核。
合同中还可约定,供应商更换模型或下调可用推理资源时,应提供变更通知与重新验收窗口。业务团队保存旧版可运行方案,遇到错误集中增加、引用链断裂或费用异常,先暂停自动写回,再复核新旧配置。这样的安排需要在采购阶段谈妥;等服务升级后才寻找旧版本,往往难以还原差异发生的条件,也会增加事故调查成本。
投资者尽调也可要求管理层解释评测修订流程:谁负责汇总,谁批准改分,旧版记录保存在哪里,脚注能否对应实际产品。缺少这些材料时,应将供应商信息披露能力单独列为风险,继续做限定范围试点。仅凭修改过数字就作出舞弊判断,或者仅凭厂商解释就取消验收,都超出了目前证据能支持的范围。

企业验收保留真实任务、资源预算和人工确认记录。
消息参考来源
- IT 之家|OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化
- AIHOT(IT 之家全文镜像)|Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩大幅变化
